Machine Learning Engineer 练习题 — 机器学习工程师 - 专业级

1、题库联网,会自动更新,无需重新获取;

2、激活题库,可同时拥有中英文的访问权限;

3、包含在线练习,模拟测试,PDF下载;

4、可使用小程序或电脑网页端刷题学习,有效期一年;

5、输入激活码即可使用,可点击右侧立即购买或联系客服购买。

6、有问题可通过微信,whatsapp,Line联系客服;

考试信息

机器学习工程师 – 专业级

英文全称:Professional Machine Learning Engineer(PML)

- 考试语言:英语、日语、韩语、西班牙语

- 费用:200美元

- 时长:120分钟

- 题型:50–60道单选/多选题

- 及格线:约70%

- 有效期:2年

- 报考链接:https://cloud.google.com/certification/machine-learning-engineer

- 定位:GCP平台端到端机器学习模型开发、训练、部署与监控

样题

Machine Learning Engineer · Q1
Topic 1 Question #1 您正在构建一个机器学习模型来检测实时传感器数据中的异常情况。您将使用发布/订阅机制来处理传入的请求。您希望存储结果以进行分析和可视化。您应该如何配置管道?
  • A.
    1 = 数据流,2 = AI 平台,3 = BigQuery
  • B.
    1 = 数据处理,2 = 自动机器学习,3 = 云端 Bigtable
  • C.
    1 = BigQuery,2 = AutoML,3 = 云函数
  • D.
    1 = BigQuery,2 = AI平台,3 = 云存储

答案: A

本题考察Google Cloud专业机器学习工程师认证中实时机器学习管道的服务选型能力,题目核心需求有三点,一是对接发布订阅机制实时处理传感器流数据,二是运行已构建的异常检测机器学习模型得到检测结果,三是存储结果支持后续分析与可视化。选项A的三个组件正好对应管道的三个核心环节,流处理层用数据流消费发布订阅消息做实时数据预处理,推理层用AI平台部署的异常检测模型完成实时推理,存储层用BigQuery存储推理结果,同时支持SQL分析与BI可视化,完全匹配所有需求。 各选项分析: A. 数据流即Google Cloud Dataflow,是托管的无服务器流批一体处理服务,原生支持对接发布订阅服务消费实时消息,完成传感器数据的清洗、格式化等预处理工作,符合实时管道的第一层需求;AI平台即Google Cloud AI Platform,是托管的模型推理服务,可直接部署训练好的异常检测模型,接收预处理后的实时数据输出检测结果,符合第二层推理需求;BigQuery是托管云数据仓库,支持海量数据的低成本存储,原生支持SQL查询分析,可直接对接Looker Studio等可视化工具生成分析报表,完全满足第三层存储与分析可视化需求,因此该选项正确。 B. 数据处理是通用概念而非特定的托管流处理服务,无法直接对接发布订阅构建生产级实时管道;AutoML是低代码模型训练服务,本题中模型已经构建完成,无需使用AutoML训练,且AutoML不适合承担高并发实时推理的工作;云端Bigtable是分布式宽表数据库,适合低延迟高并发的随机读写场景,原生不支持复杂SQL分析,也很难直接对接BI工具做可视化,不符合结果存储的需求,因此该选项错误。 C. BigQuery是分析型数据仓库,不具备实时流数据消费与预处理的能力,无法作为管道第一层对接发布订阅处理实时传感器数据;AutoML的核心能力是模型训练,不适用于实时推理场景;云函数是轻量事件驱动计算服务,不具备数据存储与分析能力,无法满足结果存储分析的需求,因此该选项错误。 D. BigQuery无法作为管道第一层处理实时流数据;云存储是对象存储服务,虽然可以存储结果数据,但原生不支持SQL查询分析,对接可视化工具的复杂度远高于BigQuery,不符合分析可视化的需求,因此该选项错误。 关键知识点: 1. 实时机器学习管道架构设计,核心要点是实时流数据处理、模型推理、结果存储三层需分别选择适配对应场景的云服务,满足低延迟、高可用、易分析的要求。 2. Google Cloud数据与AI服务场景适配,核心要点是Dataflow适用于流批数据预处理,AI Platform/Vertex AI适用于托管模型推理,BigQuery适用于分析型结果存储与即席查询。 3. 异常检测场景工程落地要求,核心要点是实时传感器异常检测场景需要流处理服务对接消息队列,推理服务支撑低延迟预测,数仓服务支撑后续的异常结果分析复盘。 参考资料: 构建实时异常检测管道, Google Cloud Professional Machine Learning Engineer 认证指南, https://cloud.google.com/certification/guides/machine-learning-engineer
Machine Learning Engineer · Q2
Topic 1 Question #2 贵公司希望提高内部班车服务的效率。目前,班车在早上 7 点至 10 点之间,每 30 分钟一班,停靠全市所有上车点。开发团队已在 Google Kubernetes Engine 上构建了一个应用程序,要求用户提前一天确认是否在乘车地点和上车站点。您应该采取什么方法?
  • A.
    1. 构建一个基于树的回归模型,预测每个接驳站点将接送多少乘客。2. 根据预测结果,调度一辆大小合适的接驳车,并在地图上标出所需的停靠站点。
  • B.
    1. 构建一个基于树的分类模型,预测班车是否应该在每个站点接载乘客。2. 根据预测结果,调度可用的班车,并在地图上显示所需的停靠站点。
  • C.
    1. 将最优路线定义为在给定时间内经过所有已确认有人乘坐的接驳巴士站点且满足运力限制的最短路线。2. 调度一辆大小合适的接驳巴士,并在地图上标明所需的停靠点。
  • D.
    1. 构建一个强化学习模型,该模型使用基于树的分类模型来预测接驳巴士站点是否有乘客,并以基于距离的指标作为奖励函数。2. 根据模拟结果调度合适大小的接驳巴士,并在地图上显示所需的站点。

答案: C

题目明确说明用户已经提前一天确认了乘车地点和上车站点,意味着所有需要停靠的站点、各站点乘车人数都是确定性已知数据,无需进行预测类的机器学习建模。提高班车效率的核心诉求是在满足运力限制的前提下,规划最短的运行路线,同时匹配对应运力的班车,避免资源浪费。选项C的方案直接基于已有的确定性数据,使用运筹学的车辆路径规划方法求解最优方案,没有引入不必要的复杂度,成本最低且准确性最高,完全匹配业务需求,符合Google云机器学习工程师认证中优先选择最简可行方案的核心原则。 各选项分析: A. 错误。题目中已经有用户提前确认的各站点乘车人数,无需额外构建回归模型预测乘客数,属于过度建模,不仅会增加开发和运行成本,还可能引入预测误差,降低方案准确性,不符合最简方案优先的选型原则。 B. 错误。用户已经提前确认了需要乘车的站点,不需要分类模型预测是否需要停靠,多此一举,反而可能因为模型误判导致漏接乘客,影响服务质量,属于不必要的机器学习应用。 C. 正确。该方案基于已有的确定性乘车确认数据,将问题转化为带运力约束的车辆路径问题,使用运筹学方法即可快速求解最优路线和匹配对应运力的班车,方案简单高效,准确性高,完全满足提升班车效率的需求,符合最佳实践要求。 D. 错误。首先站点是否有乘客是已确认的事实,无需分类模型预测,其次强化学习适合动态、不确定环境下的序列决策问题,对于这种输入完全确定的路径规划问题,使用强化学习不仅开发成本极高,收敛速度慢,效果还不如传统运筹学方法,属于严重的过度设计。 关键知识点: 1. 机器学习方案选型原则:Google Professional Machine Learning Engineer认证要求方案选型优先选择满足需求的最简方案,优先使用确定性规则、运筹学方法,仅当问题无法通过非机器学习方案解决时才引入机器学习模型,避免不必要的复杂度和误差。 2. 车辆路径问题(VRP)适用场景:当已知所有停靠点需求、运力约束、时间窗口等确定性信息时,使用运筹学的VRP求解方法即可高效得到最优路线,无需引入机器学习模型。 3. 业务数据前置评估:设计技术方案前需首先梳理已有的业务数据,基于现有数据的确定性程度选择匹配的技术方案,避免为了使用机器学习技术而过度建模。 参考资料: Google Cloud MLOps:机器学习中的持续交付和自动化管道, https://cloud.google.com/architecture/mlops-continuous-delivery-and-automation-pipelines-in-machine-learning?hl=zh-cn Google Cloud Optimization AI 概述
Machine Learning Engineer · Q3
Topic 1 Question #3 您受命根据传感器读数调查生产线组件的故障。收到数据集后,您发现只有不到 1% 的读数是代表故障事件的正例。您尝试训练了几个分类模型,但都无法收敛。您应该如何解决类别不平衡问题?
  • A.
    利用班级分布生成 10% 的正面例子。
  • B.
    使用卷积神经网络,并采用最大池化和softmax激活函数。
  • C.
    对数据进行加权下采样,以创建一个包含 10% 正例的样本。
  • D.
    删除反例,直到正例和反例的数量相等。

答案: C

本题属于机器学习工程中典型的极端类别不平衡处理场景,不到1%的正例占比会导致模型训练时损失被多数类(反例)主导,完全无法学习少数类(故障事件)的特征,最终无法收敛。All Professional Machine Learning Engineer Questions认证要求工程师掌握不同采样方法的适用场景,加权下采样是处理高度类别不平衡的标准工程方案,本题中通过该方法将正例占比调整到10%,既大幅降低了不平衡度让模型可以同时学习正负类特征解决收敛问题,又通过加权逻辑尽可能保留了多数类的原始分布特征,不会过度损失数据信息,保证模型后续的泛化能力,完全匹配题目需求。 各选项分析: A. 错误,该选项提到的生成正例属于过采样范畴,未明确使用SMOTE等合规合成逻辑的前提下盲目生成正例,极易引入不符合真实故障分布的噪声,甚至直接复制正例导致模型严重过拟合,无法有效解决收敛问题,不符合认证要求的工程实践规范。 B. 错误,卷积神经网络主要适用于图像、时序序列等存在局部关联的网格结构数据,题目未说明传感器读数属于此类结构,且CNN的网络架构、池化和激活函数本身不具备解决类别不平衡的能力,对模型收敛无任何帮助。 C. 正确,加权下采样是认证体系中明确的高度类别不平衡优先解决方案之一,通过对占比极高的反例进行带分布权重的抽样,既保留了反例的核心分布特征,又将正例占比提升到10%大幅缓解不平衡度,让模型能够同时学习两类特征,有效解决无法收敛的问题。 D. 错误,直接删除反例直到正负数量相等,会丢失98%以上的反类原始数据,导致反类特征信息严重损失,模型泛化能力会大幅下降,属于认证体系中明确禁止的极端错误操作。 关键知识点: 1. 极端类别不平衡判定与影响,分类任务中少数类占比低于5%时属于极端不平衡,会导致损失被多数类主导,模型无法学习少数类特征最终无法收敛。 2. 加权下采样技术要点,加权下采样针对多数类进行抽样,通过权重设计保留多数类的原始分布特征,比随机下采样的信息损失更小,适合处理高度不平衡分类任务。 3. 采样风险规避原则,处理类别不平衡时,盲目合成少数类样本或过度删除多数类样本,都会导致数据分布偏移,引发模型过拟合或泛化能力下降。 参考资料: AWS Machine Learning Developer Guide: Processing Imbalanced Data, https://docs.aws.amazon.com/machine-learning/latest/dg/processing-imbalanced-data.html Google Cloud Architecture Center: Machine Learning Best Practices, https://cloud.google.com/architecture/ml-on-gcp-best-practices#handle-class-imbalance
Machine Learning Engineer · Q4
Topic 1 Question #4 您希望在 Google Cloud 上重建用于结构化数据的机器学习管道。您目前使用 PySpark 进行大规模数据转换,但管道运行时间超过 12 小时。为了加快开发速度和管道运行时间,您希望使用无服务器工具和 SQL 语法。您已将原始数据迁移到 Cloud Storage。如何在满足速度和处理能力要求的前提下,在 Google Cloud 上构建管道?
  • A.
    使用 Data Fusion 的 GUI 构建转换管道,然后将数据写入 BigQuery。
  • B.
    将你的 PySpark 转换为 SparkSQL 查询来转换数据,然后在 Dataproc 上运行你的管道,将数据写入 BigQuery。
  • C.
    将数据导入 Cloud SQL,将 PySpark 命令转换为 SQL 查询以转换数据,然后使用 BigQuery 中的联合查询进行机器学习。
  • D.
    使用 BigQuery Load 将数据导入 BigQuery,将 PySpark 命令转换为 BigQuery SQL 查询以转换数据,然后将转换结果写入新表。

答案: D

本题核心需求有四点,一是使用无服务器工具降低运维负担、加快开发速度,二是使用SQL语法适配现有转换逻辑的迁移,三是解决现有PySpark管道运行超过12小时的性能问题,四是适配已存储在Cloud Storage的原始数据。结合Google Cloud Professional Machine Learning Engineer认证的服务选型、管道架构设计核心考点,选项D的方案完全匹配所有需求:BigQuery是Google Cloud原生的无服务器PB级数据仓库,不需要用户管理任何基础设施,符合无服务器要求;BigQuery支持标准SQL语法,可以便捷将原有PySpark的结构化数据转换逻辑转写为SQL语句,降低迁移成本;BigQuery的分布式计算能力针对结构化数据处理做了深度优化,相比自行搭建的PySpark集群可大幅提升处理速度,解决运行时间过长的问题;同时BigQuery支持直接从Cloud Storage导入多种格式的结构化数据,适配现有数据存储位置,端到端流程简洁,开发和运行效率都满足要求。 各选项分析: A. 错误,Data Fusion是可视化的无服务器ETL工具,核心使用方式是GUI拖放配置,不符合题目要求的使用SQL语法的需求,且针对纯结构化数据转换场景,Data Fusion的处理效率低于直接使用BigQuery SQL,无法最大程度缩短管道运行时间。 B. 错误,Dataproc是托管Spark/Hadoop集群服务,并非完全无服务器,用户仍需要对集群配置、扩缩容进行管理,不符合无服务器的要求;同时Dataproc上运行SparkSQL的性能弱于BigQuery原生SQL,无法最优解决原有管道运行时间过长的问题。 C. 错误,Cloud SQL是面向在线事务处理的关系型数据库,不适合大规模数据分析转换场景,无法支撑原有PySpark对应的大规模数据处理量级;且BigQuery联合查询访问Cloud SQL数据的性能远低于直接在BigQuery内部处理数据,会进一步降低管道运行效率,不符合要求。 D. 正确,该方案完全满足题目所有需求,BigQuery无服务器特性无需运维基础设施,BigQuery SQL符合SQL语法要求,从GCS导入数据适配现有数据存储,且BigQuery的高性能计算能力可大幅缩短管道运行时间,是符合认证最优架构要求的方案。 关键知识点: 1. BigQuery无服务器ELT能力:BigQuery支持直接从Cloud Storage导入CSV、Parquet等多种格式的结构化数据,可通过标准SQL实现大规模数据的清洗、转换等操作,全程无需用户管理服务器资源。 2. Google Cloud数据处理服务选型原则:对于SQL优先的大规模结构化数据处理场景,优先选择BigQuery,其性能、开发效率、运维成本都优于需要管理集群的Dataproc或侧重可视化ETL的Data Fusion。 3. 结构化数据机器学习管道预处理最佳实践:在GCP上构建结构化数据机器学习管道时,优先使用BigQuery完成数据预处理,可直接对接后续BigQuery ML、Vertex AI等机器学习服务,实现端到端的无服务器管道。 参考资料: 1. 从 Cloud Storage 加载数据到 BigQuery, https://cloud.google.com/bigquery/docs/loading-data-cloud-storage 2. 使用 BigQuery 转换数据
Machine Learning Engineer · Q5
Topic 1 Question #5 你管理着一个数据科学家团队,他们使用基于云的后端系统提交训练任务。该系统的管理变得非常困难,因此你想改用托管服务。你的数据科学家团队使用多种不同的框架,包括 Keras、PyTorch、Theano、Scikit-learn 和自定义库。你应该怎么做?
  • A.
    使用 AI 平台自定义容器功能接收使用任何框架的训练作业。
  • B.
    配置 Kubeflow 在 Google Kubernetes Engine 上运行,并通过 TF Job 接收训练作业。
  • C.
    在 Compute Engine 上创建 VM 镜像库,并将这些镜像发布到集中式存储库。
  • D.
    设置 Slurm 工作负载管理器,以接收可以调度到云基础设施上运行的作业。

答案: A

本题核心需求包含两点,一是降低现有训练系统的管理复杂度,改用托管服务减少基础设施运维投入,二是兼容多种主流机器学习框架及自定义库,无需限制数据科学家的技术栈。AI平台的自定义容器功能是全托管机器学习训练服务,用户仅需将包含对应框架、依赖的运行环境打包为标准容器镜像上传,即可直接提交训练作业,平台自动完成资源调度、作业生命周期管理、日志收集等运维工作,同时完全不限制用户使用的框架和依赖,完美匹配所有需求。 各选项分析: A. 该选项正确。AI平台(现整合为Vertex AI)是Google Cloud提供的全托管机器学习服务,其自定义容器功能支持用户使用任意打包了自定义运行环境的容器提交训练作业,兼容所有主流机器学习框架和自定义库,且用户无需管理底层基础设施,大幅降低管理复杂度,完全符合题目需求。 B. 该选项错误。Kubeflow是开源的机器学习工作流编排工具,部署在GKE上需要用户自行完成集群配置、Kubeflow组件运维、作业适配等工作,不属于全托管服务,管理复杂度很高,且TF Job原生主要适配TensorFlow框架,对其他框架的支持需要额外配置,不符合需求。 C. 该选项错误。Compute Engine VM镜像属于IaaS层服务,用户需要自行管理VM的调度、生命周期、资源分配、集群运维等工作,管理复杂度没有降低,不属于托管机器学习训练服务,不符合需求。 D. 该选项错误。Slurm是开源的高性能计算工作负载管理器,需要用户自行部署、维护调度集群和相关配置,不属于云厂商提供的托管服务,无法降低系统管理难度,不符合需求。 关键知识点: 1. 全托管机器学习训练服务的选型逻辑:优先选择屏蔽底层基础设施运维的PaaS层服务,自定义容器支持是实现多框架、自定义依赖兼容的核心能力。 2. 开源机器学习编排/调度工具的适用场景:Kubeflow、Slurm等工具适用于需要高度定制化训练流程的场景,但需要用户承担大量运维工作,会提升系统管理复杂度。 3. 云服务分层的运维责任划分:IaaS层服务由用户负责从操作系统到应用的全栈运维,全托管机器学习PaaS服务由云厂商负责基础设施和平台层运维,可大幅降低用户管理负担。 参考资料: Train using custom containers | Vertex AI | Google Cloud, Professional Machine Learning Engineer Certification Guide, https://cloud.google.com/certification/guides/machine-learning-engineer

常见问题

Machine Learning Engineer 有多少道练习题?

本题库收录 Machine Learning Engineer 练习题共 339 道,含单选、多选等题型,每题配有答案与解析。

Machine Learning Engineer 练习题支持中英文吗?

支持,Machine Learning Engineer 练习题为中英双语对照,便于对照原文理解。

Machine Learning Engineer 练习题可以免费试做吗?

可以,本页提供免费样题在线试做;完整题库可在掌学兔注册后获取。